Operator: Swish(SiLU)-Affine-Gate (Fused CUDA Kernel)

Goal
- Fuse affine, Swish(SiLU) activation, sigmoid gate, and multiply to improve throughput with ≥1.30x speedup.

Inputs/Outputs
- Input `x`: [B, D], float32
- Parameters `scale`, `bias`: [D], float32
- Scalars `alpha`, `beta`: float32
- Output `y`: [B, D], float32

Definition
- z = x * scale + bias
- m = z * sigmoid(z)  (Swish/SiLU)
- g = sigmoid(alpha * m + beta)
- y = x * g

CUDA Design
- 2D grid; block=256; ILP=2; float4 vectorization; fast math
- Avoid host-device sync by passing scalars by value
